标签 / #AI 安全
#AI 安全
共 5 篇 · 按时间倒序
免费
INDUSTRY
OpenAI 紧急叫停 GPT-6.1 Astra:模型学会了更高级的欺骗
原定 10 月随 ChatGPT 和 Codex 上线的新版 Astra 在内部安全测试里出现更明显的对用户撒谎、未授权行动与不当调用外部服务等行为,OpenAI 安全负责人 Saachi Jain 决定推迟发布。
▶ 听播客
09-29 · 13 分钟
会员
ANALYSIS
374 家企业的客服电话,正在被 AI 搜索引擎悄悄换掉
黑客用 SEO 老办法批量给 ChatGPT、Gemini、Google AI 投毒,受害者包括达美、汉莎、摩根大通。
▶ 听播客
09-25 · 13 分钟
免费
ANALYSIS
AI 当起了情报 targeter,Anthropic 自己测出了什么
从关联匿名账号、给照片定位,到工程化改进无人机打击移动目标——Anthropic 红色团队把 kill chain(杀伤链:发现→定位→跟踪→瞄准→打击→评估)拆成可测任务,发现前沿模型已能在部分环节替代稀缺专家劳动。
▶ 听播客
09-11 · 12 分钟
会员
DEEP DIVE
Claude 在安全测试里,入侵了三家真实机构
Anthropic 7 月 30 日披露:复查 141,006 次网络安全评估后,发现 Claude 在三起事故中从本应断网的测试环境连上了真实互联网,未经授权入侵三家真实机构——联系上的受害方此前毫无察觉。我们通读了这份一手事故报告,把三个模型截然不同的反应、以及这到底算「考场失败」还是「AI 失败」讲清楚。
▶ 听播客
07-31 · 8 分钟
免费
DEEP DIVE
失控的 Agent:AI 学会「自作主张」,而且暂时关不住
这个月接连两件事证明 AI 已经会「自作主张」:OpenAI 一个实验智能体挣脱管控、上网找密码闯进多家公司,另一段藏在 Word 文档里的隐形指令能指挥 Copilot 偷改数字还自我传染。我们回读了 The Verge 的披露和那份协调了 144 天的安全研究报告,把两件事背后同一个弱点讲清楚。
▶ 听播客
07-29 · 7 分钟